白皮书 · 华文生态系统 COS —— 为人类服务的汉字数码文明基础设施 正負 华 文 生 态 系 统 · 白 皮 书 汉字正负数码 数字底座 · 文字复兴 · 为人类服务 COS (Chinese operating system) — An Autonomous, Controllable Digital Foundation for Chinese Characters COS · 白 皮 书 文化复兴的底座是文字复兴 让汉语快速融合世界语言 · 汉字互通互识 字库 14,833 字 · 零重码 98 组部件 · 26 码位 字典 16,142 字条 / 词典 264,434 词条 抗量子 24 码 · 机机密传 数据安全保险 10 万元 22 语界面 · 195 国授权 发布单位:北京正数负数科技有限公司 定位:成为语言产业的科技领军企业 线上平台:ai.arpa.top(商用) | anquan.arpa.top(安全版) 主专利:202610784807.1 | 发明专利 12 项 | 软件著作权 24 套 发布日期:2026 年 9 月 | 文档编号:COS-WP-2026 | 密级:对外公开 本白皮书用于技术交流与合作洽谈;涉及编码规则、部件体系与加密方案的内容,以双方正式协议为准。 华 文 生 态 系 统 白皮书 · 为人类服务的汉字数码文明基础设施 White Paper — COS (Chinese operating system): A Digital Civilization Infrastructure for Chinese Characters, Serving All Humankind 文化复兴的底座是文字复兴 让全球 70 亿人看见汉字,20 亿人理解汉字,2 亿人分享汉字 —— 以汉字的灵魂,重新打造未来世界 摘要 Abstract 华文生态系统(COS, Chinese operating system)是一套以汉字部件正形与负形为本源的通用数码编码体系:把汉字直接映射为「正码 0–9 / 负码 ⁻0–⁻9 / 字母码 Z X C B N」的数字形态,实现编码即字形、字形即编码——任何汉字可编码,任何编码可还原字形。以此为基础,本生态已建成并上线完整闭环:打字输入 → 字典词典 → 长文闪送与凭据包交付 → 加密语音 → 蒸馏/抗量子加密 → 机机密传 → 中国红码 → 数码编程(DCIS/DCUL)→ 双轨数制(甲子六十进制底层/人侧 26 码位) → 数据安全保险 → 22 语国际站与华语贡献者体系 → HSK 测评与学习生态。 截至目前的核心实测:字库 14,833 字 / 14,833 码位 / 零重码;98 组正负一码部件(85 单数部首 + 13 补充形码部件);26 码位;部首码表 257 条;新华字典 16,142 字条、中文词典 264,434 词条,其中字库直接有码 15,743 字、真正无码仅 44 字;长文闪送数码压缩传输实测容量达 400 万码;抗量子加密通道 24 码+先决条件核验;数据安全保险每份文件保额 10 万元、保金 10 元(按实名国籍计人民币或美元),对方提取后 24 小时无投诉自动结案转为历史保单。所有能力均以「为人类服务」为最高立场。 The Chinese Operating System (COS) ecosystem is a universal digital coding system rooted in the positive/negative shapes of Chinese-character components: every character maps directly into a digital form — positive codes 0–9, negative codes ⁻0–⁻9, and letter codes Z X C B N — achieving the principle that "the code is the glyph, and the glyph is the code." On this foundation the ecosystem now runs a complete, live chain: typing input, dictionary and lexicon, long-text flash delivery with credential-package handoff, encrypted voice, distill and quantum-resistant encryption, machine-to-machine encrypted transfer, the Chinese Red Code, digital coding (DCIS/DCUL), base-26 Taiji arithmetic, data-security insurance, a 22-language international site with a Chinese-language contributors program, and HSK-based learning. Measured today: a 14,833-character code library (14,833 code slots, zero duplicates), 98 one-code components, 26 code positions, 257 radicals, the Xinhua dictionary's 16,142 entries and a 264,434-entry lexicon — with 15,743 characters directly coded and only 44 not yet coded. Everything serves one purpose: serving all humankind. 目录 Contents 时代命题:文字与数字文明 技术体系:部件、码位与字库 功能全景(一):打字、字典与长文闪送 功能全景(二):加密、机机密传与红码 数据安全保险:从承保到理赔 生态与国际:22 语与 195 国 编程与算力:DCIS/DCUL 与双轨数制 教育与学术:HSK 与九成之验 指标实测汇总 知识产权与标准路径 路线图 术语表 一 · 时代命题:文字与数字文明 I. The Proposition: Writing and Digital Civilization 在数字世界里,一切数据、算法、模型与交互,最终都以「文字」为入口:语料的载体是文字,指令的载体是文字,人机对话的入口仍是文字。谁定义了文字的数字存在方式,谁就握住了数字文明的底层开关。汉字是当今世界使用人口最多的文字,却在数字存在方式上长期依赖外部方案——拼音转写、他国输入法内核、域外字符集规范。这带来三重失衡:输入效率受制、编码主权旁落、汉字自身价值在数字链条中被稀释。 1.1 数字时代文字的隐性危机:不必再「理解」它 一种文字真正的危机,不是无人使用,而是使用者不必再理解它。「提笔忘字」之所以成为集体症候,正因为文字在数字链条中从「意义与形体的统一体」退化为「拼音的输入手段」——会读不会写、会打不识形。当文字只剩声音通道,它的人文厚度与形体智慧就同时被截断。 COS 的判断是:要救的不是人们的记忆力,而是文字在数字世界里的存在方式。当每一个汉字都能被「看形取码」直接键入、每一个码都能还原字形,文字便重新成为「可理解、可计算、可继承」的对象,而不再只是语音的附庸。 1.2 数字基础设施缺了什么 缺一层「以字形为本」的编码 主流计算机数制(二进制/十进制)与键盘、汉字字形之间存在结构性割裂:输入靠音,不靠形。 缺一条「语言无关」的文字通道 跨语言系统长期绑定拉丁字母与英文语序,非拉丁文字在数字结构里被动适配。 缺一套「量子时代仍安全」的传送方式 经典公钥密码面临量子威胁,「先收集、后破解」已成现实风险,而密文通道仍依赖数学陷门。 缺一种「可考核」的教育路径 文字学习长期以死记为主,缺乏可量化、可复现的效率改进路径。 缺一座「人人可练」的练习场 练习与真实使用长期割裂:学习者缺少零门槛、可即时反馈、可反复对练的场地——看形即打、随打随改,速度与正确率即时可见,练完即可用于真实输入。 缺一套「练有所奖」的考核与奖励机制 学习成效缺少权威分级与正向激励:既无可对照的等级考核,也无可累积的排行榜与赛事奖励,「学得怎么样、练得值不值」没有答案,练习难以持续。 1.3 COS 的回答:把「形」变成「数」 COS 的选择是回到文字的形体本身:把汉字拆解为**可数的部件**,把部件映射为**正负数码**,再把数码组织为**可计算的数制**。由此获得三个直接结果—— 可编码:任何汉字(含繁体、异体、扩展区字)都能按部件取出数码; 可还原:任何合法数码都能还原为字形,编码与字形互为函数; 可计算:文字首次成为可参与运算、可压缩、可加密、可编程的数据对象。 「文化复兴的底座是文字复兴。」 —— 以汉字正负数码为桥,让汉语快速融合世界语言、汉字互通互识 1.4 立场:为人类服务 本白皮书描述的所有技术能力,都从一个立场出发:为人类服务。它不是为一国一族的文字优越性,而是让每一种语言、每一个文明在数字时代都能被平等地书写、平等地检索、平等地传承;让信息在量子时代依然安全;让所有人学习文字的时间与成本显著下降。 二 · 技术体系:部件、码位与字库 II. The Technology: Components, Code Positions, Library 2.1 编码规则:26 码位与 98 组一码部件 COS 以 26 个码位覆盖汉字全部形体要素,与标准键盘一一对应—— 码位类别 数量 内容 键位映射 正码 10 0 1 2 3 4 5 6 7 8 9 第二排 A–L + M(M=0) 负码 10 ⁻0 ⁻1 ⁻2 ⁻3 ⁻4 ⁻5 ⁻6 ⁻7 ⁻8 ⁻9 第一排 Q–P(负号在数字头顶) 字母码 6 Z 言(讠) / X 木 / C 土(士) / V 补充码 / B 日 / N 金(钅) 第三排 Z X C V B N 汉字的取码单位是部件:98 组「正负一码部件」= 85 个单数部首 + 13 个补充形码部件。每个部件对应唯一一枚码片,因此「看字形 → 拆部件 → 取码片」全程不需要读音参与,也不需要记忆字根表以外的拼音规则。 2.2 取码三原则 取大不取小优先取更大的成字部件,减少切片数量 → 最少取码在可唯一识别的前提下,用最少的码片完成输入 → 先笔先取 · 有序取码按书写顺序(先左后右、先上后下、先外后内)推进 当不同汉字取到同一串数码时,采用补充码 V 补位区分(例如「八=8」与「人=8V」);常用长字的数码可放宽到 5 位,以保证高频字仍然直观可记。词组则按 3.3 取码规则(两字各取首码、三字各取首码、四字及以上取前三字首码+末字首码)形成最短可识别整数码。 2.3 字库实测:14,833 字,零重码 14,833 已编码汉字(字) 14,833 唯一码位(个) 0 重码位 98 正负一码部件(组) 26 码位(正10+负10+字母6) 257 部首码表条目 字库并非静态清单,而是一条可扩展、可回归验证的生产线:单字字表 → 编码管线(部件解析、码位仲裁、重码补位)→ 字库与码位表 → 页面内嵌 → 线上运行。管线内置三重保障: 既有码保护:新增字只占空位,绝不改动存量字码; 历史码位保护:跨版本的历史码位一律保留给原主人,保证旧密文永远可解回原字(旧密文回放 100% 正确); 唯一性校验:全库零重码、码长合规(常规 ≤4 个数码码片,补充码不计入码长)。 2.4 从字库到字典:覆盖率实测 以新华字典与中文词典为标尺,字库的覆盖情况如下: 指标 实测值 说明 新华字典字条 16,142 字典收录汉字规模 中文词典词条 264,434 词组编码与查询的数据基础 字库直接有码 15,743 可直接键入并还原 可经繁简映射打出 355 由标准字码扩展 真正无码 44 多为域外异体/罕用字,持续补录中 覆盖率 ≈ 99.7%(可直接键入 + 繁简映射)。这一数字意味着:对日常书写、出版物用字与绝大多数文献用字,COS 已具备完整替代能力。 2.5 取码示例:可解释、可复现 编码的价值在于「可解释」——同一个字,任何人按同一规则都能得到同一串数码。以下为实际字例(V 为补充码,⁻ 表示负码): 字 形体依据 数码 说明 八 单一部件 8 最简形态:一码成字 人 与「八」同码 8V 以补充码 V 区分(重码补位) 凸 同码竞争 0V V 补位第二位 凹 同码竞争 0VV V 补位第三位 森 木+木+木(木=X) XXX 三同部件:形与码完全一致 嗯 口+因(口=0) 004⁻2V 常用长字,补充码收尾 嘢 口+野(口=0) 0051V 方言常用字亦按同规则取码 絶 繁体「絶」= 简体「绝」形 ⁻79V 繁体与简体共享同一码基,以 V 区分 緑 繁体「緑」= 简体「绿」形 ⁻7⁻3⁻1VV 异体字按形体映射,兼容繁简 从表中可见三条规律:其一,同形同码——字形相同则数码相同;其二,繁简互通——繁体与简体共享码基,仅以补充码区分,因此同一份数码可跨字体还原;其三,可扩展——新字只需按同一部件规则取码,不改变任何既有字码。 三 · 功能全景(一):打字、字典与长文闪送 III. Capabilities I: Typing, Dictionaries, Flash Delivery 3.1 打字输入 用户在标准键盘上「看形取码」即可完成汉字输入:键位图与物理键盘一一对应,第一排为负码、第二排为正码、第三排为字母码。支持候选选择、词库联想、繁简切换、深色模式、语音播报与输入预览。全过程不依赖拼音——这对不熟悉汉语拼音的使用者、非母语学习者、以及需要在无读音环境中录入的场景,都是结构性的效率改变。 3.2 字典与词典 平台内置两部权威工具书的数字版:新华字典 16,142 字条与中文词典 264,434 词条,每条同时给出拼音、部首、笔画、释义与正负数码。查询支持按字、按词、按数码三向检索——这是传统字典做不到的一条通道:知道形,就能查到字;知道码,就能查到义。 3.3 长文闪送:从「记住一串码」到「交付一个凭据包」 长文闪送解决的是一件事:如何把一份内容安全地交给另一个人,而不让它停留在任何可被窥视的位置。当前版本的完整流程如下: ① 加密压缩文本/文件按内容压缩并数码化 → ② 同步分析命中已有码则复用原数码,否则随本次点击入库 → ③ 生成凭据包数码+多维度条件一并打包 → ④ 发送对方复制凭据或发送凭据文件 → ⑤ 自动匹配解密对方粘贴或拖入提取栏即解 → ⑥ 一次性失效成功接收后该数码自动失效 三个设计要点值得说明: 数码压缩传输:超大内容先压缩再数码化入库,提取方自动解压复原;实测密文容量可达 400 万码,足以承载长篇文档与大体量数据。 凭据包交付:加密完成后界面不再显示提取数码,而是生成「加密凭据包」——数码与多维度条件(时间/地址/IP/先决条件等)一并打包,发送方「复制凭据」或「下载凭据文件」交给对方即可;对方把凭据粘贴或拖入提取栏就自动匹配解密。这样既减少人工输入,又避免提取码在屏幕上暴露。为应对极端情况,界面保留一个默认隐藏的「显示数码(备用)」折叠入口,点开才显示数码与复制按钮。 服务器不可视:平台仅存数码密文,提取即删、不可视、不缓存;对方成功接收后该数码自动失效,具备一次性密钥语义。 3.4 打字之外:学习闭环 输入只是入口。围绕「学会、练熟、考核、坚持」四个环节,平台提供了配套闭环: 练习模式 内置多篇短文与随机切换,实时统计输入速度、用时与正确率,练完即见进步曲线。 生词本与查码 输入中遇到的生字可即查即存;支持按字查码、按词查码与新词新字入库。 国学文库 成语、唐诗、宋词与经典的数码化阅读与检索,让练习材料本身就是文化内容。 等级测评 HSK 1–6 级框架下的中文等级测评,为学习进度提供外部标尺。 学习排行榜 以累计练习字数为排名依据,把个人坚持变成可比较的公开进度。 学习视频 配套 12 个学习视频,站内播放,讲清取码规则与常见字拆解。 这套闭环的意义是:把「认字」拆成可测量的小步——看得懂(拆部件)→ 打得准(取码)→ 测得清(测评)→ 坚持得下去(排行榜与练习)。 四 · 功能全景(二):加密、机机密传与红码 IV. Capabilities II: Encryption, Machine-to-Machine, Red Code 4.1 三档加密通道 平台的加密能力分为三档,覆盖从日常到高敏的不同需求: 通道 形态 适用与要点 蒸馏加密 12 码 中文加数码的常规档:密文是汉字按形蒸馏出的正负数码,无数学陷门可攻;普通用户与会员均可使用。 抗量子加密 24 码 + 先决条件核验 高敏档:发送方可设定姓名/虹膜/声纹/自主口令等多维度先决条件,提取方须逐项匹配;连续核验失败将自动销毁该项加密。 加密语音 音频字节数码化 录音后按字节转为正负数码密文入库,提取方在本页解密播放或下载音频文件,全程不落第三种格式。 4.2 一次性密钥语义与「链路不见明文」 提取即删:密文一经提取立即从服务器删除,服务器侧不留副本; 不可视、不缓存:平台任何界面均不展示明文内容,也不做内容缓存; 收讫失效:对方成功接收后,该提取数码随即失效,他人即使得到同一数码也无法再次提取; 无数学陷门:密文并非依赖大数分解或离散对数的数学难题,而是以形—数映射与一次性语义构成的信息结构。 4.3 机机密传:两台计算机之间的全自动加密互认 机机密传面向指挥调度、应急系统、智能驾驶、高危物品管理等需要在机器之间直接、私密传递重要信息的场景。其机制要点: 机器码互认双方机器码自动识别,无需人工填写 → IP 自动比对服务器侧校验来源,异常即拒绝 → 会话密钥一次性传递密钥随本次连接生成并随连接传递 → 3 分钟时效密文限时有效,超时自动失效 → 本机自动解码对方在本机完成解码,不经人工、不经第三方 对于「一对多」投递,平台支持向多台已确认接收机逐台定向加密投递,每台独立一次性会话密钥,各自自动解码。也可将机机密传内容导出为凭据文件交付,接收方拖入提取栏即在本机解密。 4.4 后量子升级路线 平台已按「编码层—存储层—密码层—架构层」四层纵深预置后量子能力,并规划与 NIST 后量子标准(ML-KEM/ML-DSA)的对接升级。需要强调的是:即便公钥算法被量子计算攻破,本体系的密文仍不以数学难题为唯一防线——一次性语义与提取即删的机制不因算力提升而失效。 4.5 中国红码:让「分享」与「直连」变成扫一扫 中国红码是平台自有的码制(当前 v3 形态:37×37 垛口外圈 + 9 个 11×11 小码点,小码点各自随机旋转,保留隔离线以便稳定识别)。它承担两类工作: 分享:把内容(含汉字与数码)编码为红码图形,扫码即得; 邀请直连:把机器的邀请信息编码为红码,对方扫码即定向直连,无需手工输入机器码。 五 · 数据安全保险:从承保到理赔 V. Data-Security Insurance: Underwriting to Claims 把「安全」从技术承诺变成可查询、可赔付、可审计的制度安排,是 COS 在行业内的一项独特设计。数据安全保险已随加密功能上线运行。 5.1 承保要素 10 万元 每份文件保额(丢失赔付) 10 元 保金(中国籍人民币) $10 保金(外籍美元,按实名国籍) 24 小时 提取后无投诉自动结案 一份文件一份保单:每完成一次加密入库即新增一份电子保单,与提取数码一一绑定(同码同保单,稳定可查); 保额与保金:每份文件保额 10 万元;保金 10 元,中国籍按人民币、外籍按美元,以实名认证身份为准; 自愿参与:用户可在会员中心选择参与或不参与,未参与则不生成新保单; 自动结案:对方提取后 24 小时无投诉即自动结案,结案后转为历史保单留档可查。 5.2 保单生命周期 加密入库生成保单号,与提取数码绑定 → 承保中凭据交付、等待对方提取 → 已提取对方成功接收,数码失效 → 24 小时无投诉自动结案 → 历史保单留档可查、可导出对账 5.3 用户侧:查询、对账与理赔 用户中心「🛡 我的保单」提供完整的自助能力: 查询:按保单号、按提取数码,或登录后按手机号/账号查询本人历史保单(仅本人可见,信息脱敏); 对账:单张与批量导出 PDF(A4 打印版,字体内嵌);导出 Excel(UTF-8,含保单号、绑定数码、档位、密文长度、生成/到期时间、承保状态); 筛选与分页:按生成时间筛选,默认每页 10 张; 统计:显示「保单赔付:」与「已支付保单:」(含保金合计、承保中/已结案/已过期分布); 理赔:每张保单可发起理赔申请(填写赔付诉求金额、联系方式、出险说明)→ 状态「待审核」→ 平台审核后转「已赔付」或「已驳回」,用户在「我的理赔申请」中随时查看进度。 5.4 平台侧:保单管理与资金视图 管理后台在「财务管理」之下设置「保单管理」,含两个视图: 视图 内容 用途 保单收入 保单总数、保金收入合计、逐单明细(保单号/归属用户/保金/状态) 收入核对与对账 保单理赔 理赔笔数与合计、逐笔明细(保单号/金额/状态/时间)与赔付登记(单份上限 10 万元) 理赔处理与风控 在用户侧的加密传输区,平台明确标注「丢失泄密赔 10 万」——把安全承诺写在用户看得到的地方。 5.5 为什么把「保险」放进编码生态 因为安全不是一个技术形容词,而是一组可执行的义务:承诺要能被查询,责任要能被追溯,损失要能被赔付。保险机制把「我们很安全」翻译成「如果出事,我们按规则赔」——这是技术自信的制度化表达,也是让机构与个人敢于把重要内容交给这套通道的前提。 5.6 制度意义与合规边界 把保险写进产品流程,实质上是把「安全承诺」变成三项可验证的义务: 义务 落地方式 数据最小化 服务器仅存数码密文,提取即删、不可视、不缓存;平台不掌握明文内容。 责任可追溯 保单与提取数码一一绑定,承保、提取、结案、理赔各环节状态留痕,可查询、可导出对账。 赔付可执行 保额、保金、上限、结案口径均为明示规则;用户可自助发起理赔,平台按流程审核处理。 同时有必要明示边界,避免误读:① 保险按「一份加密文件一份保单」计算,单份保额上限 10 万元;② 保金按实名认证身份确定币种与标准;③ 保单在对方提取后 24 小时无投诉即自动结案,此后作为历史保单留存备查;④ 是否参与由用户自行选择,平台不强制。 六 · 生态与国际:22 语与 195 国 VI. Ecosystem & Internationalization 6.1 22 语界面与语言无关的中间表示 平台提供 22 种界面语言一键切换,覆盖主要语区。更关键的一层在于:因为 COS 编码以字形为本、与读音解耦,汉字数码天然成为一种语言无关的中间表示——同一串数码,在不同的语言环境中可以对应不同的读音与释义,而字形与编码保持稳定。这为跨语言检索、跨语言教学与多语内容对齐提供了统一的数据底座。 6.2 195 国授权体系 围绕「汉字出海」,平台建立了覆盖 195 个国家与地区的授权体系:包括语言教学机构、出版与内容机构、硬件与系统集成商的合作框架,以及面向不同国家的语言研究与教学落地路径。 6.3 华语贡献者体系 平台设立「华语贡献者」名录,致敬文字创制、统一与传播的先贤与专家,并向当代与在世的学者开放推荐与审核通道。当前名录共 139 位: 分类 人数 说明 远古文字 22 造字与文字整理的先贤 近代文字 35 近代文字改革与国语运动先驱 当代文字 31 当代文字学、语言学与信息安全领域的院士与专家 专家学者 51 推荐并审核通过的专家学者 其中:院士 18 / 学部委员 3 / 专家教授 59 为体系提供语言科学权威保障 名录的展示规则公开透明:当代文字与专家学者两类按前一日查看数量排序,排名不分先后。每位贡献者拥有独立官网页,可由读者直接访问。 6.4 学习生态:排行榜与书法大赛 学习排行榜:以全球用户累计练习字数排名,鼓励持续练习,形成正向激励; 书法大赛:每年一届,设楷书、行书、草书、隶书、篆书、硬笔、海外组等组别,并特设毛体组别;采用「智能初选 → 专家盲选 → 各国排行」三级评审;奖金池按各国参与学习人数占比动态分配,规则公开。 6.5 会员体系与推广体系 生态的可持续依赖清晰的权益与激励结构: 会员专属能力:抗量子加密、加密语音、HSK 等级测评、多语翻译与国学文库全文等高级能力面向会员开放;普通用户仍可使用基础加密与全部查询功能。 推广激励:用户可获得推广码、分享链接与红码名片,每成功推荐一位正式会员即获得奖励,收益可在用户中心查询与申请结算。 机构与国家授权:面向高校、科研机构、出版与硬件厂商,以及国家/地区层面的语言推广合作,提供授权、接口与数据服务。 透明规则:会员权益、推广奖励与授权范围均公开列示,收益与结算记录可在用户中心核对。 这套结构的取向是:让使用者得到实惠、让传播者得到回报、让合作方得到标准——生态因此不是单向推广,而是多方共建。 七 · 编程与算力:DCIS/DCUL 与双轨数制 VII. Coding & Computing: DCIS/DCUL and Base-26 7.1 数码编程体系:DCIS 与 DCUL 当文字成为数码,指令也可以成为数码。平台构建了两套面向开发者的体系: 体系 规模 作用 DCIS(数码指令集) 97 条编码 × 8 种语言 以数码为核心的指令表达,覆盖常用程序逻辑;8 种语言绑定便于跨语言实现与教学 DCUL(数码接口层) 37 个接口 为外部系统接入提供标准接口,使汉字数码能力可被调用、可被集成 其意义不在于替代现有编程语言,而在于提供一条以汉字/数码为原语的表达路径:让中文使用者可以用母语的字形与数序思维组织逻辑,也让教学场景可以用同一套符号贯通「识字—算术—编程」。 7.2 双轨数制:甲子六十进制(底层)与人侧 26 码位 26 个码位不仅是一套输入法,也是一种数制:以 26 为基,正负对称,免进位负担。其实测指标如下: 17,576 26³ 状态空间(三码位) 4.70 bit 单次击键信息量 −92.3% 进位次数减少 −79% 存储与传输量下降 40–60% 较 UTF-8 编码更省 100,007 例换算零误差 这些数值来自实际换算与压力测试:在 100,007 例整数与 26 码位(数码片)互转中零误差;在可比较的语料与数据规模上,采用数码化表达后的存储与传输量出现数量级改善。需要说明的是,甲子六十进制与二进制彼此兼容而非互斥:它可以在现有计算体系之上运行,作为面向「文字—数码」场景的更高效表达层。 7.3 三算合一的教学意义 文字、算术与逻辑原本是三条学习路径,在 COS 中它们共用同一套符号:识字用码位、算术用数制、逻辑用指令集。对教育场景而言,这意味着学习者不必在三套彼此割裂的符号系统之间反复切换——学习成本显著下降,而迁移能力显著提高。 八 · 教育与学术:HSK 与九成之验 VIII. Education & Academia 8.1 测评与内容体系 HSK 1–6 级中文等级测评:按国际通行的等级框架组织,配套题库与等级认证; 学习视频与练习:12 个学习视频与内置练习短文,支持速度与正确率实时统计; 高校与科研机构入口:机构可申请入驻,上传教学资料、视频与数据库,审核通过后公开共享; 国学文库:成语、唐诗、宋词与经典的数码化检索与学习。 8.2 学习路径的改变:从「音—形—义」到「形—码—义」 传统识字路径以读音为入口:先记音,再由音联想形与义。COS 提供了另一条路径——以形体为入口:看字形 → 拆部件 → 取数码 → 得字义。其价值在于三方面: 绕开读音门槛:不依赖拼音基础,降低非母语者与方言区学习者的入门难度; 形体可解释:每个数码都有部件依据,汉字不再是需死记的任意符号; 可复现、可考核:取码规则明确,学习效果可用测评数据纵向对比。 8.3 九成之验:一个可考核的目标 平台提出阶段性目标:进入教育体系后,全人类学习文字的时间平均减少 90%(远期愿景 99%)。为使这一目标可被检验,平台给出三条验证路径与一组量化指标: 验证路径 方法 观测指标 试点前后测 同一批学习者在同一课程标准下,采用 COS 路径前后各进行一次测评 达标用时、单位时间识字量、留存率 机构数据对照 与教学机构合作,在平行班之间进行路径对照 课堂学时、作业正确率、教师工作量 等级测评对照 以 HSK 1–6 级为标尺,比较达到同一等级所需训练时长 等级通过率、等级用时 目标口径:进入教育体系后全人类学习文字的时间平均减少 90%;远期愿景 99%。 —— 该目标以可复现的测评数据为验收依据,而非修辞 8.4 学术共建 平台向语言学研究机构提出「共建五请」:标准研究、联合教学实验、学术论证、数据开放、人才培养。可交付成果包括:字库与码表、测评题库、标准建议稿,以及与教学机构共研的实验数据。 九 · 指标实测汇总 IX. Measured Indicators 下表汇总本白皮书涉及的核心实测指标,供评估与验收对照。 类别 指标 实测值 编码与字库 已编码汉字 14,833 字 唯一码位 14,833 个(重码位 0) 正负一码部件 98 组(85 单数部首 + 13 补充形码部件) 码位 26(正码 10 + 负码 10 + 字母码 6) 部首码表 257 条 码长合规 数码码片常规 ≤4(补充码 V 不计入),常用长字可 5 位 字典词典 新华字典字条 16,142 中文词典词条 264,434 字库直接有码 15,743 真正无码 44 闪送与加密 数码压缩传输容量 实测达 400 万码 加密通道 蒸馏 12 码/抗量子 24 码+先决条件/加密语音 机机密传时效 3 分钟,对方本机自动解码 数据安全保险 每份文件保额 10 万元 保金 10 元(中国籍人民币/外籍美元,按实名国籍) 自动结案 对方提取后 24 小时无投诉自动结案转历史保单 理赔 用户可发起申请 → 待审核 → 已赔付/已驳回(单份上限 10 万元) 生态与国际 界面语言 22 语 授权体系 195 个国家与地区 华语贡献者 139 位(远古 22/近代 35/当代 31/专家 51;院士 18/学部委员 3/专家教授 59) 编程与算力 DCIS 97 条编码 × 8 种语言 DCUL 37 个接口 数制效率 26³=17,576;4.70 bit/击;进位 −92.3%;储运约 −79%;较 UTF-8 省 40–60% 换算准确性 100,007 例零误差 教育与学术 测评体系 HSK 1–6 级;12 个学习视频 阶段目标 进入教育体系后学习文字时间平均减少 90%(远期 99%) 平台与知产 双站架构 商用站与安全版独立运行,用户与数据相互隔离 知识产权 主专利 202610784807.1;12 项发明专利;24 项软件著作权 十 · 知识产权与标准路径 X. Intellectual Property & Standards 10.1 知识产权布局 围绕编码体系、加密方法、传输机制与算力架构,平台已形成体系化的知识产权组合: 类别 数量 说明 主专利 202610784807.1 基于正负杂合数的汉字数码化编码模型 发明专利 12 项 覆盖编码、加密、传输、机机密传等方向 软件著作权 24 项 覆盖字库、输入、闪送、字典、后台、加密与安全、运营与资料等模块 10.2 标准路径:三步走 第一步 · 团体标准以企业标准与团体标准形式固化编码、字库与接口规范,先行先试 → 第二步 · 行业标准联合教学、出版、信息安全等行业机构,形成跨行业应用规范 → 第三步 · 国家与国际标准推动汉字数码编码进入国家字符编码标准体系,并参与国际标准对话 平台提出的编码标准方向(CSCII,Chinese Standard Code for Ideographic Input)参照 ASCII 的历史角色:让每一个汉字拥有紧凑、可解释、可逆的数码身份,并可与现有字符集互为映射,从而在不破坏既有生态的前提下获得更优的中文表达层。 10.3 自主可控的四个维度 编码自主 汉字数字身份由中国自主定义,不依附外部方案。 数据主权 密文以本国文字为承载体,敏感数据传输不依赖境外密码设施。 产业引领 以编码底座带动输入法、教育、编程、硬件与云服务的全链升级。 文化安全 文字是文明的载体,编码是文字的命脉;掌握编码,才掌握数字时代的话语权。 十一 · 路线图 XI. Roadmap 平台已越过「技术验证」阶段:编码、字库、字典、闪送、加密、机机密传、保险与生态体系均已上线运行。后续工作沿三条主线推进。 主线 近期(已上线/进行中) 中期 远期 编码与字库 14,833 字零重码;部首码表 257 条;旧密文兼容层 补齐剩余 44 个无码字;扩充异体字与域外汉字;持续人工校订扩库 形成完整汉字数码编码规范与字符集建议稿 安全与保险 三档加密、机机密传、一次性密钥语义、数据安全保险(10 万保额/10 元保金/24 小时结案/理赔全流程) 后量子算法对接(ML-KEM/ML-DSA);理赔证据附件;机构级保单汇总与审计视图 面向关键行业的合规加密通道与保险机制常态化 教育与国际 HSK 1–6 级测评;22 语界面;195 国授权;华语贡献者 139 位;学习排行榜与书法大赛 试点校与教学机构合作,形成「九成之验」前后测数据集 进入多国教育体系,实现学习文字时间显著下降的可复现证据链 11.1 关键里程碑(已完成) 完成汉字正负数码编码体系与 98 组一码部件设计,建成 14,833 字字库(零重码); 建成双站平台(商用站与安全版)并上线运行,用户与数据相互隔离; 上线长文闪送(数码压缩传输、凭据包交付)、加密语音、蒸馏加密与抗量子加密(24 码+先决条件)、机机密传; 上线中国红码、字典词典(16,142 字条/264,434 词条)、22 语国际站与华语贡献者体系; 上线 DCIS/DCUL 数码编程体系与 双轨数制实测能力; 上线数据安全保险全流程(承保—查询—对账—理赔—后台管理)。 十二 · 术语表 XII. Glossary 术语 释义 COS 华文生态系统(Chinese operating system · 华文操作系统):以汉字部件正负形为本源的数码编码体系与生态总称。 正码 0–9 十个正数码位,对应键盘第二排(A–L 与 M=0)。 负码 ⁻0–⁻9 十个负数码位,对应键盘第一排(Q–P),负号显示在数字头顶。 字母码 Z 言(讠)/X 木/C 土(士)/V 补充码/B 日/N 金(钅) 六个字母码位。 正负一码部件 对应唯一一枚码片的汉字部件,共 98 组(85 单数部首 + 13 补充形码部件)。 补充码 V 重码区分机制:不同汉字取到同一数码时,以 V 补位区分(如「八=8」「人=8V」)。 3.3 词组取码 词组最短码规则:二字词各取首码;三字词各取首码;四字及以上取前三字首码+末字首码。 凭据包 加密完成后生成的交付物:数码与多维度条件一并打包,可复制凭据文本或下载凭据文件;对方粘贴或拖入提取栏即自动匹配解密。 先决条件 抗量子加密的多维度核验条件(姓名/虹膜/声纹/口令),提取方须逐项匹配。 一次性密钥语义 提取即删、不可视、不缓存;对方成功接收后该数码自动失效。 机机密传 两台计算机之间的全自动加密互认传输:机器码互认、IP 比对、会话密钥一次性传递、3 分钟时效、本机自动解码。 中国红码 平台自有码制(当前 v3:37×37 垛口外圈+9 个 11×11 小码点),用于内容分享与设备邀请直连。 电子保单 数据安全保险的凭证:每份加密文件一份,与提取数码一一绑定,含保额、保金、币种与承保状态。 DCIS/DCUL 数码指令集(97 条编码 × 8 种语言)与数码接口层(37 个接口)。 太极算 以 26 码位为基的算力表达方式,正负对称、免进位;26³=17,576 状态空间,单次击键 4.70 bit。 CSCII 汉字数码编码标准方向(Chinese Standard Code for Ideographic Input),三步走推进:团体→行业→国家与国际。 结语 Closing 汉字正负数码不是一项孤立的技术发明,而是一次关于「文字如何在数字世界继续存在」的回答:让每一个汉字都能被看形取出、被计算、被安全传送、被平等学习。它所连接的是四件事——文字的尊严、信息的安全、教育的效率、文明的互通。 本白皮书所载的每一项指标,都对应着线上正在运行的功能;所承诺的每一项安全义务,都有可查询的保单与可执行的理解赔付流程。我们愿意把它放在公开的标准之下接受检验,因为文化复兴的底座是文字复兴,而文字复兴的底座,是每一个普通人都能更轻松地读懂、写出并传递自己的语言。 以汉字正负数码为桥 —— 让汉语快速融合世界语言,汉字互通互识, 让未来人类学习语言的时间与成本显著下降。 华文生态系统 · COS | 白皮书 主专利 202610784807.1 | 12 项发明专利 | 24 项软件著作权 本白皮书为对外公开材料;技术实现细节与安全机制依保密纪律另行管理。